메뉴

#추론 성능

HN
Hacker News • 16일 전
IMP 8

애플 M3 뉴럴 엔진에서 50 GB/s 되찾기

애플 M3 뉴럴 엔진(ANE)의 RTL 성능 에라타로 인해 가중치 크기가 1 MiB의 정수 배일 때 DRAM 처리량이 공칭 45-60 GB/s에서 17-19 GB/s로 급감한다. 이는 저수준 하드웨어 분석을 통해 발견되었으며, 커널 DMA 엔진의 문제 경로를 우회함으로써 Llama 3.2 1B의 토큰 처리량이 10.0에서 24.3 tokens/s로, Qwen3-8B가 1.36에서 2.97 tokens/s로 각각 2배 이상 향상되었다.

애플 실리콘 뉴럴 엔진 하드웨어 최적화
HN
Hacker News • 56일 전
IMP 7

버스트성 LLM 추론을 위한 KV 캐시 예측 복제 기술

사용자 트래픽이 특정 시간에 집중되는 '버스트성(Bursty)' 환경에서 대형 언어 모델(LLM)의 추론 성능을 극대화하는 기술이 깃허브에 공개되었습니다. 트래픽 폭주를 예측하여 KV 캐시(Key-Value Cache)를 미리 복제해두는 방식을 통해, 서버 과부하나 지연 없이 빠르게 응답을 처리할 수 있도록 돕는 것이 핵심입니다.

LLM 최적화 KV 캐시 추론 성능
LL
r/LocalLLaMA • 134일 전
IMP 8

TurboQuant 정밀 성능 분석과 검증

최근 주목받는 KV-cache 양자화 기법인 TurboQuant의 실제 성능을 검증한 종합 연구 결과입니다. 30B~200B 이상의 다양한 모델과 장문 컨텍스트, 추론 벤치마크를 테스트한 결과, 기존 FP8 방식이 정확도 손실이 거의 없고 처리량과 지연 시간 면에서도 우수한 것으로 나타났습니다. 반면 TurboQuant는 약간의 메모리 절약 효과 외에는 처리 속도 저하를 유발하여 프로덕션 환경에는 FP8이 더 적합한 기본값으로 권장됩니다.

KV-cache 양자화 vLLM FP8